导读:搜索引擎蜘蛛,在搜索引擎系统中又被称之为“蜘蛛”或“机器人”,是用来爬行和访问页面的程序。今天,小小课堂网为大家带来的是《搜索引擎蜘蛛是如何爬行与抓取页面的》教程。希
发表日期:2019-09-22
文章编辑:兴田科技
浏览次数:9301
标签:
搜索引擎蜘蛛,在搜索引擎系统中又被称之为“蜘蛛”或“机器人”,是用来爬行和访问页面的程序。
今天,小小课堂网为大家带来的是《搜索引擎蜘蛛是如何爬行与抓取页面的》教程。希望对大家有所帮助。
一、搜索引擎蜘蛛简介
搜索引擎蜘蛛,在搜索引擎系统中又被称之为“蜘蛛”或“机器人”,是用来爬行和访问页面的程序。
① 爬行原理
搜索引擎蜘蛛访问网页的过程,就好比用户使用的浏览器。
搜索引擎蜘蛛向页面发出访问请求,该页面的服务器则返回该页面的HTML代码。
搜索引擎蜘蛛将收到的HTML代码存入搜索引擎的原始页面数据库中。
② 如何爬行
为了提高搜索引擎蜘蛛的工作效率,通常采用多个蜘蛛并发分布爬行。
同时,分布爬行还分为两种模式:深度优先和广度优先。
深度优先:沿着发现的链接一直爬行,直到没有任何链接。
广度优先:先这一页面上的所有链接爬行完毕之后,才会沿着第二层页面继续这样爬行。
③ 蜘蛛必遵守的协议
搜索引擎蜘蛛在访问网站之前,都会先访问网站根目录下的robots.txt文件。
搜索引擎蜘蛛不会去抓取robots.txt文件中禁止爬行的文件或目录。
④ 常见搜索引擎蜘蛛
百度蜘蛛:Baiduspider
谷歌蜘蛛:Googlebot
360蜘蛛:360Spider
SOSO蜘蛛:Sosospider
有道蜘蛛:YoudaoBot,YodaoBot
搜狗蜘蛛:Sogou News Spider
必应蜘蛛:bingbot
Alexa蜘蛛:ia_archiver
二、如何吸引更多搜索引擎蜘蛛
互联网信息爆炸,搜索引擎蜘蛛不可能将所有网站的所有链接全部爬行到,那么如何吸引更多的搜索引擎蜘蛛到我们网站上来爬行变得非常重要。
① 导入链接
无论是外部链接,还是内部链接,只有有导入,才能被搜索引擎蜘蛛知道该页面的存在。所以,多多做外链建设有助于吸引更多蜘蛛来访。
② 页面更新频率
页面更新频率越高,搜索引擎蜘蛛来访的次数也会越多。
③ 网站和页面权重
整个网站的权重以及某一页面的权重(包括首页也是页面)影响着蜘蛛的来访频率,权重高、权威性强的网站一般都会增加搜索引擎蜘蛛的好感。
④ 与首页的距离
首页>一级目录>二级目录>三级目录>四级目录…很显然,目录越深蜘蛛来访的几率和次数就会越少,因为一般外链都是指向首页的,首页再向下爬行,只会越来越少。
这里给大家的建议是,做外链的时候,不要只做首页外链,偶尔做一做栏目和聚合页面的外链也还是不错的哦~
有些时候,URL短,蜘蛛可能也会觉得这个链接的权重哦,所以,最好只做一级栏目,然后就是文章页面。
三、搜索引擎蜘蛛地址库
搜索引擎蜘蛛有一个专门的地址库,用来存放已经被发现的URL(已被抓取和未被抓取的都算,只要是被发现的URL都算),这样就不会出现重复爬行和抓取页面的情况了。
① 地址库URL来源
蜘蛛抓取的页面中发现的新的URL;
站长后台自主提交的URL;
站长后台提交的XML地图中的URL;
站长后台提交的网站URL;
② 对于未被抓取的URL
对于未被抓取的URL,不管是以什么方式获取的,哪怕是搜索引擎蜘蛛自己发现的,也会先放入地址库中,然后在做统一抓取。
四、页面数据存储
搜索引擎蜘蛛将抓取的页面数据会存入搜索引擎的原始页面数据库中,其实,就可以理解为快照中看到的页面数据,和用户看到的是一样的,每一个页面的URL地址都有一个唯一的编号。
五、复制内容检测
搜索引擎蜘蛛在爬行的过程中,会进行一定程度的复制内容检测。如果是权重低的网站上,发现了大量的转载或抄袭内容时,可能会停止爬行,这些页面可能也会不抓取与收录。
但并不是说网站就不能转载,像一些权重很高的平台,哪怕是转载了一篇旧闻排名也可以很好,因为搜索引擎蜘蛛可能会觉得,就算是旧闻可能也是高质量的吧。
以上就是小小课堂网为大家带来的是《搜索引擎蜘蛛是如何爬行与抓取页面的》教程。感谢您的观看。
喜欢记得,点赞,打赏哦。小小课堂网,每天一个SEO原创视频和图文教程,别忘了关注哦。
更多seo教程搜索小小课堂。文章来源:https://www.xxkt.org/sogouseo
本文来源:A5上一篇:
暂无信息上一篇:
果断收藏:长尾关键词优化有什么技巧?更多新闻
2020
关于seo,相信许多做SEO的朋友都跟风SEO一样,会没事的时候去百度搜索一下“SEO”这个关键词,看看排名靠前的网站有哪些,其中一个叫“顺时”的网站吸引了我,
View details
2020
关于seo,网站上线后,就会想到要把网站推广出去,让许多网友知道并看到你的网站,然后就去推广,而最简单的推广其实就是网站SEO,而站长最重要的工作就是做优化
View details
2020
关于seo,希望网站有流量但不想赚钱,那么SEO就是最好的方法,因为能够在搜索引擎上获得流量,而要获得流量就必须要在搜索引擎中获得较好的排名,这就成了网站
View details
2020
关于seo,公司设计制作网站,其目的并不是为了宣传品牌或展示产品,对于数量庞大的中小企业来说更是如此。许多公司获得顾客的主要途径都是通过互联网。策划
View details